Type: concept
Confidence: 0.85
Created: 2026-04-25
Updated: 2026-04-25
Tags: transformerfeed-forwarddeep-learningnlp机器学习

Feed-Forward Network

概述

前馈网络(Feed-Forward Network, FFN)是Transformer架构中的关键组件,是一个位置无关的两层MLP(多层感知机)。它对每个位置的表示独立地进行相同的非线性变换,与注意力机制的跨位置信息聚合形成互补。

关键内容

  1. 网络结构
  2. 两层全连接网络:ReLU激活函数
  3. 输入/输出维度:d_model = 512
  4. 内部维度:d_ff = 2048(4倍扩展)
  5. 公式:FFN(x) = max(0, xW₁ + b₁)W₂ + b₂

  6. 功能分工

  7. 注意力机制:跨位置信息聚合("哪些词相关?")
  8. FFN:逐位置特征变换("这个词的特征如何处理?")
  9. 两者协同实现全局信息整合与局部特征处理

  10. 实现方式

  11. 位置无关的变换:每个位置共享相同的权重矩阵
  12. 维度扩展:内部维度扩展4倍增强表达能力
  13. 非线性激活:ReLU函数引入非线性变换能力

  14. 在架构中的作用

  15. 每个注意力子层之后都有一个FFN
  16. 注意力机制交替出现,形成层叠结构
  17. 残差连接层归一化保证训练稳定性

来源

相关